ML Engineer - Associate 练习题 — 机器学习工程师 - 助理级

1. 题库联网,会自动更新,无需重新获取;

2. 激活题库立即做题,支持网站、小程序同时做题,每题双语一键切换;

3. 包含在线练习,模拟测试,笔记、错题记录等功能,有效期一年;

4. 建议做题顺序:开背题模式看题➡️顺序练习做题➡️模拟考试 考前自测

5. 激活码可点击右侧 立即购买,或通过天猫旗舰店购买;

6. 有问题可通过小程序、微信、WhatsApp、LINE 联系客服。

考试信息

考试代码 :Databricks-Machine-Learning-Associate

题目数量 :48 道计分考题 + 少量不计分调研题(试题不标注)

考试时长 :90 分钟(含非计分题目作答时间)

考试费用 :200 美元 + 各地税费

可用语种 :英语、日语、巴西葡萄牙语、韩语

考试形式: Kryterion 远程在线监考 / 线下授权考点机考

题型: 场景式单选 + 少量多选,侧重工程实操排错选型

合格标准: 官方未公布分数线,行业参考合格线约 70%(答对 34 题左右)

出分规则:考完即时显示通过 / 不通过;24 小时内在 Databricks 账号下载电子证书

重考规则 :首次挂科间隔 14 天、第二次失利间隔 30 天、第三次及之后间隔 60 天,同 Databricks 全系认证规则

代码语言: 考题代码以 Python 为主,数据处理穿插 SQL


成绩规则:仅显示通过/未通过,不披露具体得分


样题

ML Engineer - Associate · Q1
问题 #1 一位机器学习工程师使用 Feature Store Client fs 创建了一个名为 new_table 的特征表。创建表时,他们指定了一个包含特征表关键信息的元数据描述。现在,他们希望以编程方式检索该元数据。 以下哪行代码可以返回该元数据描述?
  • A.
    没有办法通过编程方式返回元数据描述。
  • B.
    fs.create_training_set("new_table")
  • C.
    fs.get_table("new_table").description
  • D.
    fs.get_table("new_table").load_df()
  • E.
    fs.get_table("new_table")

答案: C

本题属于All Certified Machine Learning Associate认证中特征存储模块的考点,核心考察特征表元数据的检索方法。特征存储的核心能力之一就是统一管理特征相关的元数据,支持编程方式访问,题目要求获取创建new_table时指定的元数据描述,标准Feature Store客户端API中,首先通过get_table方法获取目标特征表的实例对象,该对象的description属性就存储了创建时传入的元数据描述内容,因此选项C完全符合需求。 各选项分析: A. 错误,特征存储的核心定位就包含元数据的统一治理与可编程访问,这是ACMLA认证中特征存储模块的基础知识点,开发者完全可以通过官方API获取特征表的元数据描述,不存在无法获取的情况。 B. 错误,create_training_set方法的作用是基于特征表拼接生成可供模型训练使用的结构化训练数据集,属于数据生产类API,和元数据描述的检索需求无关。 C. 正确,fs.get_table("new_table")会返回指定名称的特征表实例对象,该对象的description属性直接存储了创建表时指定的元数据描述内容,完全匹配题目要求的返回元数据描述的需求。 D. 错误,load_df()方法的作用是将特征表中存储的业务特征数据加载为DataFrame格式返回,属于特征数据读取类API,返回的是特征数据而非元数据描述。 E. 错误,fs.get_table("new_table")返回的是完整的特征表对象,包含元数据集合、数据操作方法、表结构schema等多类信息,并不是直接返回元数据描述本身,不符合题目要求。 关键知识点: 特征存储元数据管理能力:特征存储会统一存储特征表的描述、版本、血缘、数据类型等元数据,支持可编程检索,是机器学习工程中特征治理的核心基础。 Feature Store客户端API分类规则:需区分元数据访问、特征数据读取、训练集生成三类API的不同用途,这是ACMLA认证中特征存储模块的核心考点。 特征表对象属性构成:特征表实例包含元数据类属性(如description、schema)和数据操作类方法(如load_df、create_training_set),两者功能边界明确,调用时需按需选择。 参考资料: Databricks Feature Store Python API 参考, https://docs.databricks.com/en/machine-learning/feature-store/python-api.html Amazon SageMaker Feature Store 元数据管理指南, https://docs.aws.amazon.com/sagemaker/latest/dg/feature-store-metadata.html
ML Engineer - Associate · Q2
问题 #2 一位数据科学家有一个 Spark DataFrame spark_df。他/她想创建一个新的 Spark DataFrame,其中只包含 spark_df 中 price 列的值大于 0 的行。 以下哪个代码块可以实现此任务?
  • A.
    spark_df[spark_df["price"] > 0]
  • B.
    spark_df.filter(col("price") > 0)
  • C.
    从 spark_df 中选择 * 条件 price > 0
  • D.
    spark_df.loc[spark_df["price"] > 0,:]
  • E.
    spark_df.loc[:,spark_df["price"] > 0]

答案: B

本题考察All Certified Machine Learning Associate认证要求掌握的PySpark DataFrame基本操作技能,任务目标是从现有Spark DataFrame中筛选出price列大于0的行,属于数据预处理阶段的常见行过滤需求。选项B采用Spark官方原生的filter方法构造过滤逻辑,是符合PySpark语法规范的标准实现,能够正确返回仅包含满足条件行的新Spark DataFrame,完全匹配题目要求。 各选项分析: A. 该写法是pandas DataFrame支持的布尔索引语法,Spark DataFrame原生不支持此类方括号布尔索引操作,无法在PySpark环境中正确执行,因此错误。 B. PySpark的DataFrame类提供的filter方法是官方指定的行过滤API,col函数用于引用指定列名的列对象,构造的col("price")>0是合法的过滤条件表达式,执行后会返回仅包含price大于0的行的新Spark DataFrame,完全符合题目需求,因此正确。 C. 该内容是SQL逻辑的自然语言描述,并非可执行的PySpark代码块,不符合题目要求的代码实现形式,因此错误。 D. loc是pandas DataFrame特有的按标签索引的属性,Spark DataFrame不存在loc属性,该写法不符合PySpark语法规范,无法执行,因此错误。 E. 该写法不仅使用了Spark不支持的loc属性,且索引的第二个参数对应列选择逻辑,与题目要求的行过滤需求不符,语法和逻辑均错误,因此错误。 关键知识点: 1. PySpark DataFrame行过滤操作:All Certified Machine Learning Associate认证要求掌握PySpark数据预处理核心操作,其中过滤行需使用filter()或where()方法,传入布尔条件表达式实现。 2. PySpark与pandas DataFrame的语法差异:认证要求区分分布式Spark DataFrame与单机pandas DataFrame的API差异,避免混淆pandas特有语法和PySpark原生API。 3. Spark DataFrame列引用方法:构造过滤条件时可通过col()函数、df["列名"]等方式合法引用Spark DataFrame的列,是编写过滤逻辑的基础。 参考资料: PySpark官方文档 DataFrame.filter方法说明, https://spark.apache.org/docs/latest/api/python/reference/pyspark.sql/api/pyspark.sql.DataFrame.filter.html Spark官方SQL编程指南 DataFrame操作章节, https://spark.apache.org/docs/latest/sql-programming-guide.html#untyped-dataset-operations-aka-dataframe-operations
ML Engineer - Associate · Q3
问题 #3 一家医疗机构正在开发一种分类模型,用于判断患者是否感染了某种特定类型的疾病。该机构的领导希望最大限度地提高模型识别出的阳性病例数量。 以下哪项分类指标应该用于评估该模型?
  • A.
    均方根误差
  • B.
    精确度
  • C.
    剩余运行曲线下的面积
  • D.
    准确性
  • E.
    回忆

答案: E

本题属于二分类任务的评估指标选型场景,业务目标是尽可能多识别出实际感染疾病的阳性患者,降低漏诊概率。根据All Certified Machine Learning Associate认证的分类指标选型核心考点,当业务漏检成本远高于误检成本时,应优先选择召回率(回忆)作为核心评估指标,召回率越高代表实际阳性样本中被成功识别的比例越高,完全匹配题目需求。 各选项分析: A. 均方根误差是回归任务的专属评估指标,用于衡量回归模型预测值与真实值的误差大小,不适用于本题的分类任务,因此错误。 B. 精确度(精确率)衡量的是所有预测为阳性的样本中实际为阳性的比例,侧重降低误诊概率,会为了避免误判阳性而漏过大量真实阳性样本,不符合题目最大化识别阳性病例的需求,因此错误。 C. 剩余运行曲线下的面积不属于机器学习领域通用分类评估指标,即使为翻译误差指向常用的ROC曲线下面积(AUC),该指标仅衡量模型整体区分正负样本的综合能力,无法针对性优先保障阳性样本的识别率,因此错误。 D. 准确性(准确率)衡量的是全部样本中预测正确的比例,疾病检测场景通常正负样本不平衡,高准确率可能是模型将大量样本预测为阴性实现的,会导致大量阳性患者漏诊,不符合题目需求,因此错误。 E. 回忆即召回率,计算公式为真阳性样本数/(真阳性样本数+假阴性样本数),直接衡量所有实际阳性样本中被成功识别的比例,召回率越高则漏诊的阳性患者越少,完全符合题目最大限度提高识别阳性病例数量的需求,因此正确。 关键知识点: 1. 分类与回归任务评估指标差异,回归任务采用误差类指标评估,分类任务采用准确率、召回率、精确率等指标评估,二者不可混用。 2. 召回率与精确率的业务适配规则,召回率适用于漏检成本高的场景如疾病检测、违禁品识别,精确率适用于误检成本高的场景如营销推送、司法风险判定。 3. 不平衡分类场景的指标选型,正负样本占比差异大的分类场景不可盲目使用准确率作为核心评估指标,需结合业务需求选择对应指标。 参考资料: Google机器学习速成课程:分类评估指标, 微软Learn:评估分类模型
ML Engineer - Associate · Q4
问题 #4 在下列哪种情况下,用中位数而不是均值来填补缺失的特征值更为合适?
  • A.
    当特征属于类别类型时
  • B.
    当特征为布尔类型时
  • C.
    当特征中包含大量极端异常值时
  • D.
    当特征中不包含异常值时
  • E.
    当特征不包含缺失值时

答案: C

本题考查All Certified Machine Learning Associate Questions认证中数据预处理模块的缺失值填补核心考点。均值是通过所有样本值求和除以样本量得到的统计量,对极端异常值非常敏感,当数据存在大量极端值时,均值会被异常值拉扯,无法代表数据的真实集中趋势。而中位数是将数据排序后处于中间位置的数值,仅和数据的位置排序有关,不受极端异常值的影响。因此当特征包含大量极端异常值时,使用中位数填补缺失值比均值更能保障填补后的数据符合真实分布,不会引入过大的偏差,所以正确答案为C。 各选项分析: A. 类别类型特征属于离散非数值型特征,中位数和均值都是针对数值型数据的统计量,类别特征填补通常采用众数或业务专属的缺失标识,因此该选项错误。 B. 布尔类型是二分类别型特征的一种,同样不属于数值型数据,无法适用中位数或均值进行填补,通常采用众数填补,因此该选项错误。 C. 大量极端异常值会大幅偏移均值的计算结果,导致均值无法代表数据的集中趋势,而中位数对极端值的鲁棒性极强,此时用中位数填补缺失值更合理,因此该选项正确。 D. 当特征不包含异常值时,均值可以充分利用所有样本的数值信息,对数据集中趋势的代表性优于中位数,此时优先选择均值填补,因此该选项错误。 E. 当特征不包含缺失值时,不存在填补缺失值的需求,和题目讨论的场景完全无关,因此该选项错误。 关键知识点: 1. 机器学习数据预处理的缺失值填补策略,不同数据类型、数据分布需匹配对应的填补方法,是All Certified Machine Learning Associate Questions认证的基础必考内容。 2. 数值型集中趋势统计量的特性,均值属于参数统计量对极端异常值敏感,中位数属于非参数位置统计量对极端值鲁棒性强。 3. 异常值处理是数据预处理的重要环节,未合理处理的异常值会引入数据偏差,直接影响后续机器学习模型的训练效果。 参考资料: Microsoft Learn 清理和准备数据以便使用机器学习, AWS Machine Learning 开发者指南 数据预处理, https://docs.aws.amazon.com/machine-learning/latest/dg/data-preprocessing.html
ML Engineer - Associate · Q5
问题 #5 一位数据科学家用各特征变量的中位数替换了特征集中的缺失值。一位同事认为,这样做会丢失有价值的信息。 为了尽可能多地在特征集中包含信息,他可以采取以下哪些方法?
  • A.
    使用各特征变量的均值而不是中位数来填补缺失值
  • B.
    不要人为地填充缺失值,而应该让机器学习算法来决定如何处理它们。
  • C.
    从特征集中删除所有原本包含缺失值的特征变量
  • D.
    为每个包含缺失值的特征创建一个二元特征变量,以指示每一行的值是否已被插补。
  • E.
    为每个包含缺失值的特征创建一个常量特征变量,该变量表示该特征中最初缺失值的行数百分比。

答案: D

本题核心需求是在缺失值插补的基础上尽可能多保留原始特征集的信息,使用中位数插补缺失值的核心问题是丢失了该样本的当前值是否为插补所得,即原始值是否缺失的隐含信息,这类信息往往具备较高的预测价值,比如某类用户群体天然倾向于不填写某类特征,缺失本身就是分类或回归的有效信号。选项D的做法是当前工业界和All Certified Machine Learning Associate认证体系中推荐的标准优化方案,在保留原特征中位数插补后的数值分布信息的同时,额外新增二元特征记录缺失状态,最大限度保留了原始数据的全部可利用信息,完全符合题目需求。 各选项分析: A. 均值和中位数同属单值统计量插补方案,二者的差异仅为对特征分布偏态的适配性不同,本质上都丢失了值是否为缺失的隐含信息,并未提升保留的信息量,因此该选项错误。 B. 绝大多数传统机器学习算法,包括线性回归、支持向量机、基础决策树等,都无法直接处理带缺失值的数据集,必须提前完成缺失值处理,该说法不具备通用性,也未解决信息保留的问题,因此该选项错误。 C. 删除所有含缺失值的特征会直接丢失该特征的全部有效信息,是信息损失最大的处理方案,完全不符合题目尽可能保留信息的需求,因此该选项错误。 D. 为每个含缺失值的特征新增二元指示特征,取值为1代表该样本当前值为插补所得、0代表为原始值,既保留了原特征插补后的数值信息,又保留了原始缺失状态的隐含信息,最大限度提升了特征集的信息密度,因此该选项正确。 E. 常量特征的所有样本取值完全一致,对于机器学习模型来说不具备任何区分度,属于无效特征,无法为特征集增加任何有效信息,因此该选项错误。 关键知识点: 1. 缺失值的隐含信息价值:特征值是否缺失本身往往具备预测意义,属于需要保留的有效信息,单值插补会直接丢失该类信息。 2. 缺失值插补优化实践:为含缺失值的特征新增二元缺失指示列,是All Certified Machine Learning Associate认证体系中明确推荐的提升信息保留率的标准方案。 3. 单值插补的局限性:使用均值、中位数等单一统计量插补缺失值仅能保留特征的整体统计分布特征,无法保留样本层面的缺失状态信息。 参考资料: 1. AWS Machine Learning Developer Guide: Handling Missing Values, https://docs.aws.amazon.com/machine-learning/latest/dg/handling-missing-values.html 2. Microsoft Learn: Handle missing values in your data

常见问题

ML Engineer - Associate 有多少道练习题?

本题库收录 ML Engineer - Associate 练习题共 140 道,含单选、多选等题型,每题配有答案与解析。

ML Engineer - Associate 练习题支持中英文吗?

支持,ML Engineer - Associate 练习题为中英双语对照,便于对照原文理解。

ML Engineer - Associate 练习题可以免费试做吗?

可以,本页提供免费样题在线试做;完整题库可在掌学兔注册后获取。